Micron Document
<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Large Language Model</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Large_Language_Model"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Large_Language_Model rootpage-Large_Language_Model skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Large Language Model</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p>Ein <b><span lang="en">Large Language Model</span></b>, kurz <b><span lang="en">LLM</span></b> (englisch, teilweise <a href="Lehn%C3%BCbertragung" title="Lehnübertragung">übertragen</a> <b>großes Sprachmodell</b>), ist die <a href="Softwaretechnik" title="Softwaretechnik">Software-technische</a> Realisierung eines mathematischen <a href="Sprachmodell" title="Sprachmodell">Sprachmodells</a>, das sich durch seine Fähigkeit zur <a href="Textgenerierung" title="Textgenerierung">Textgenerierung</a> auszeichnet. Es handelt sich um ein sogenanntes <a href="Computerlinguistik" title="Computerlinguistik">computerlinguistisches</a> Wahrscheinlichkeitsmodell, das <a href="Statistik" title="Statistik">statistische</a> Wort- und Satzfolge-Beziehungen aus einer Vielzahl von Textdokumenten durch einen rechenintensiven Trainingsprozess erlernt hat und diese Fähigkeiten seinem Benutzer oder in einer anderen Anwendung zur Verfügung stellt.<sup id="cite_ref-1" class="reference"><a href="#cite_note-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup>
</p>

<div class="mw-heading mw-heading2"><h2 id="Beschreibung">Beschreibung</h2></div>
<p>Große Sprachmodelle erlangen ihre Fähigkeiten durch die Verwendung gigantischer Datenmengen, um während des Trainings riesige Mengen von Parametern zu lernen. Dabei verbrauchen sie extrem viel Rechenressourcen.<sup id="cite_ref-2" class="reference"><a href="#cite_note-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> Große Sprachmodelle sind im weiteren Sinne <a href="K%C3%BCnstliches_neuronales_Netz" title="Künstliches neuronales Netz">künstliche neuronale Netze</a> und werden (<a href="A_priori" title="A priori">a priori</a>) entweder durch selbstüberwachtes Lernen oder halbüberwachte Lernmethoden trainiert. Für diese neuronalen Netze werden seit etwa dem Jahr 2024 häufig <a href="Transformer_(Maschinelles_Lernen)" title="Transformer (Maschinelles Lernen)">Transformer</a> als Architektur gewählt.<sup id="cite_ref-3" class="reference"><a href="#cite_note-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup> Bekanntheit haben dabei die <a href="Generativer_vortrainierter_Transformer" title="Generativer vortrainierter Transformer">Generative Pretrained Transformer</a> (GPT) erlangt.
</p><p>Große Sprachmodelle arbeiten als selbstanpassende Sprachmodelle, die „verschiedene Aufgaben in <a href="Nat%C3%BCrliche_Sprache" title="Natürliche Sprache">natürlicher Sprache</a> ausführen können, z.&nbsp;B. das Zusammenfassen, Übersetzen, Vorhersagen und Erstellen von Texten, indem sie einen Eingabetext nehmen und wiederholt das nächste Token oder Wort vorhersagen“.<sup id="cite_ref-4" class="reference"><a href="#cite_note-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-5" class="reference"><a href="#cite_note-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup>
</p><p>Bis 2020 bestand die einzige Möglichkeit, ein Modell an bestimmte Aufgaben anzupassen, in der sogenannten <a href="Fine-Tuning_(K%C3%BCnstliche_Intelligenz)" title="Fine-Tuning (Künstliche Intelligenz)">Feinabstimmung</a>.<sup id="cite_ref-6" class="reference"><a href="#cite_note-6"><span class="cite-bracket">[</span>6<span class="cite-bracket">]</span></a></sup> Größere Modelle, wie z.&nbsp;B. das inzwischen populäre LLM <a href="GPT-3" title="GPT-3">GPT-3</a>, wurden jedoch so konzipiert, dass sie mit Hilfe des sogenannten „<a href="Prompt_Engineering" title="Prompt Engineering">Prompt Engineering</a>“ ähnliche Ergebnisse erzielen können.<sup id="cite_ref-7" class="reference"><a href="#cite_note-7"><span class="cite-bracket">[</span>7<span class="cite-bracket">]</span></a></sup> Zusätzlich zu der Fähigkeit, Kenntnisse über <a href="Syntax" title="Syntax">Syntax</a>, <a href="Semantik" title="Semantik">Semantik</a> und „Ontologie“ in menschlichen <a href="Korpuslinguistik" title="Korpuslinguistik">Sprachkorpora</a> zu erwerben, wird angenommen, dass große Sprachmodelle auch in der Lage sind, Ungenauigkeiten und Verzerrungen in den Korpora zu erfassen.<sup id="cite_ref-8" class="reference"><a href="#cite_note-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Umsetzungen_der_LLM">Umsetzungen der LLM</h2></div>
<p>Beispiele für LLM-Software oder -Services oder -Apps sind <a href="Open_Assistant" title="Open Assistant">Open Assistant</a>, <a href="ChatGPT" title="ChatGPT">ChatGPT</a>, <a href="Ernie_Bot" title="Ernie Bot">Ernie Bot</a> und <a href="Grok" title="Grok">Grok</a>. Die Services sind dabei wie ein Chat aufgebaut, der mit seinem Benutzer kommuniziert, auch bekannt als <a href="Chatbot" title="Chatbot">Chatbot</a>.
</p><p>Zu den großen Sprachmodellen zählen die folgenden <a href="Generativer_vortrainierter_Transformer" title="Generativer vortrainierter Transformer">GPT</a>-Modelle:
</p>
<ul><li><a href="OpenAI" title="OpenAI">OpenAI</a>, z.&nbsp;B. <a href="GPT-3" title="GPT-3">GPT-3</a>, die in ChatGPT und <a href="Microsoft_Copilot" title="Microsoft Copilot">Microsoft Copilot</a> verwendet werden</li>
<li><a href="Google" title="Google">Google</a>, z.&nbsp;B. <a href="PaLM" title="PaLM">PaLM</a>, <a href="Gemini_(Sprachmodell)" title="Gemini (Sprachmodell)">Gemini</a> und weitere Varianten</li>
<li><a href="Meta_Platforms" title="Meta Platforms">Meta</a> <a href="LLaMA-Sprachmodell" title="LLaMA-Sprachmodell">LLaMA-Sprachmodelle</a> (Open-Source)</li>
<li><a href="Anthropic" title="Anthropic">Anthropics</a> <a href="Claude_(Sprachmodell)" title="Claude (Sprachmodell)">Claude</a> und</li>
<li><a href="XAI" title="XAI">xAI</a> <a href="Grok" title="Grok">Grok</a></li></ul>
<p>Daneben gibt es auch leistungsfähige LLMs chinesischer Firmen wie diejenigen von <a href="Alibaba_Group" title="Alibaba Group">Alibaba</a>, <a href="DeepSeek" title="DeepSeek">DeepSeek</a>, 01 AI und Zhipu AI.<sup id="cite_ref-9" class="reference"><a href="#cite_note-9"><span class="cite-bracket">[</span>9<span class="cite-bracket">]</span></a></sup>
</p><p>LLMs werden in verschiedenen IT-Umgebungen bzw. Systemen (vgl. <a href="Cloud_Computing" title="Cloud Computing">Cloud</a>) im Zuge von <a href="Onlinedienst" title="Onlinedienst">Onlineservices</a> von verschiedenen <a href="Internetdienstanbieter" title="Internetdienstanbieter">Internetdienstleistern</a> angeboten. Letztere sind meist als <a href="Start-up-Unternehmen" title="Start-up-Unternehmen">Startups</a> oder Innovationsabteilungen in Organisationen oder Unternehmen aufgestellt. Die Lizenzen in Bezug auf die Fähigkeiten, Nutzung und Datenverarbeitung der verschiedenen Modelle und Services reichen von <a href="Propriet%C3%A4re_Software" title="Proprietäre Software">proprietär</a> über <a href="Open_Source" title="Open Source">Open Source</a> bis hin zu anderen. In diesem Zusammenhang spielt auch der <a href="Datenschutz" title="Datenschutz">Datenschutz</a> eine übergeordnete Rolle.
</p>
<div class="mw-heading mw-heading2"><h2 id="Entstehung_und_Entwicklung">Entstehung und Entwicklung</h2></div>
<div class="mw-heading mw-heading3"><h3 id="Software">Software</h3></div>
<p>Auf der „<a href="Conference_on_Neural_Information_Processing_Systems" title="Conference on Neural Information Processing Systems">Conference on Neural Information Processing Systems</a>“ (NeurIPS) 2017 stellten Google-Forscher unter <a href="Ashish_Vaswani" title="Ashish Vaswani">Ashish Vaswani</a> eine neue Transformer-Architektur vor.<sup id="cite_ref-10" class="reference"><a href="#cite_note-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-11" class="reference"><a href="#cite_note-11"><span class="cite-bracket">[</span>11<span class="cite-bracket">]</span></a></sup> Ziel dieser Veröffentlichung war es, die sogenannte „Seq2seq“-Technologie aus dem Jahr 2014 zu verbessern, und es basierte hauptsächlich auf dem entwickelten „<span style="font-style:normal;font-weight:normal"><a href="Englische_Sprache" title="Englische Sprache">englisch</a></span> <span lang="en-Latn" style="font-style:italic">attention mechanism</span> <span lang="de" style="font-style:normal;font-weight:normal">‚Aufmerksamkeitsmechanismus‘</span>“.<sup id="cite_ref-12" class="reference"><a href="#cite_note-12"><span class="cite-bracket">[</span>12<span class="cite-bracket">]</span></a></sup> Im darauffolgenden Jahr 2018 wurden die <a href="Bidirectional_Encoder_Representations_from_Transformers" title="Bidirectional Encoder Representations from Transformers">Bidirectional Encoder Representations from Transformers</a> (BERT) eingeführt und schnell „allgegenwärtig“. Obwohl der ursprüngliche Transformator sowohl <a href="Kodierer" title="Kodierer">Encoder</a>- als auch Decoderblöcke hat, ist BERT ein reines Encoder-Modell.<sup id="cite_ref-13" class="reference"><a href="#cite_note-13"><span class="cite-bracket">[</span>13<span class="cite-bracket">]</span></a></sup>
</p><p>Obwohl GPT-1 im Jahr 2018 als reines Decoder-Modell eingeführt wurde, erregte GPT-2 im Jahr 2019 große Aufmerksamkeit, da <a href="OpenAI" title="OpenAI">OpenAI</a> es zunächst als zu leistungsfähig erachtete, um es aus Angst vor böswilliger Nutzung zu veröffentlichen. <a href="GPT-3" title="GPT-3">GPT-3</a> im Jahr 2020 ging noch einen Schritt weiter und ist ab 2024 nur noch über eine API verfügbar, ohne die Möglichkeit, das Modell zur lokalen Ausführung herunterzuladen. Es war das browserbasierte ChatGPT aus dem Jahr 2022, das „die Welt komplett veränderte“.<sup id="cite_ref-14" class="reference"><a href="#cite_note-14"><span class="cite-bracket">[</span>14<span class="cite-bracket">]</span></a></sup> 2023 wurde GPT-4 für seine erhöhte Genauigkeit und als „heiliger Gral“ für seine multimodalen Fähigkeiten gepriesen.<sup id="cite_ref-15" class="reference"><a href="#cite_note-15"><span class="cite-bracket">[</span>15<span class="cite-bracket">]</span></a></sup> OpenAI gab die High-Level-Architektur und die Anzahl der Parameter des GPT-4 nicht bekannt.
</p><p>In der Zwischenzeit haben konkurrierende Sprachmodelle größtenteils mit der GPT-Serie gleichgezogen, zumindest was die Anzahl der Parameter betrifft.<sup id="cite_ref-16" class="reference"><a href="#cite_note-16"><span class="cite-bracket">[</span>16<span class="cite-bracket">]</span></a></sup> Zu den bemerkenswerten Ausnahmen in Bezug auf die Anzahl der Parameter gehören Googles T5-11B von 2019 und <a href="PaLM" title="PaLM">PaLM-E</a> von 2022.
</p><p>Seit 2022 erfreuen sich Open-Source-Modelle zunehmender Beliebtheit, zunächst vor allem BLOOM und <a href="LLaMA-Sprachmodell" title="LLaMA-Sprachmodell">LLaMA</a>, die allerdings beide Einschränkungen im Einsatzbereich aufweisen. Im Januar 2024 war Mixtral 8x7b von <a href="Mistral_AI" title="Mistral AI">Mistral AI</a> laut dem LMSYS Chatbot Arena Leaderboard das leistungsfähigste offene LLM, leistungsfähiger als GPT-3.5, aber nicht so leistungsfähig wie GPT-4.<sup id="cite_ref-17" class="reference"><a href="#cite_note-17"><span class="cite-bracket">[</span>17<span class="cite-bracket">]</span></a></sup>
</p><p>Am 26. Januar 2024 übertraf Googles Gemini Pro das GPT-4,<sup id="cite_ref-18" class="reference"><a href="#cite_note-18"><span class="cite-bracket">[</span>18<span class="cite-bracket">]</span></a></sup> was die <a href="Elo-Zahl" title="Elo-Zahl">Elo-Bewertung</a> betrifft. Letztere wird im Umfeld von LLM zum <a href="Benchmark" title="Benchmark">Benchmarking</a> verwendet.
</p>
<div class="mw-heading mw-heading3"><h3 id="Hardware">Hardware</h3></div>
<p>LLM sind <a href="Rechnertechnik" title="Rechnertechnik">rechenintensive</a> Software-Anwendungen. Dafür kommen modernste <a href="Prozessor" title="Prozessor">Prozessorgeneration</a> bzw. spezialisierte <a href="Mehrkernprozessor" title="Mehrkernprozessor">Mehrkernprozessoren</a> (vgl. auch <a href="Koprozessor" title="Koprozessor">Koprozessoren</a>), wie beispielsweise <a href="Grafikprozessor" title="Grafikprozessor">Grafikprozessoren</a> (in Form von <a href="Grafikkarte" title="Grafikkarte">Grafik-</a> oder spezialisierten Prozessorkarten), die besonders gut für <a href="Gleitkommazahl" title="Gleitkommazahl">Fließkommaoperationen</a> (vgl. <a href="IEEE_754" title="IEEE 754">IEEE 754</a>) geeignet sind, zum Einsatz. In diesem Zusammenhang sei auch erwähnt, dass die neue Technologie der LLMs zu erheblichen <a href="Wirtschaftspolitik" title="Wirtschaftspolitik">wirtschaftlich</a>-politischen Auseinandersetzungen führt. Die Medien sprechen von einem „<a href="Wettr%C3%BCsten" title="Wettrüsten">Wettrüsten</a>“ im Zuge einer „<a href="Chipkrise" title="Chipkrise">Chipkrise</a>“ (siehe dort), was nicht nur die fertigen Endprodukte betrifft, sondern auch die Halbleitermaschinen in der Fertigung (vgl. <a href="TSMC" title="TSMC">TSMC</a>, <a href="ASML" title="ASML">ASML</a>; siehe auch <a href="EUV-Lithografie" title="EUV-Lithografie">EUV-Lithografie</a>). Dies äußert sich in <a href="Sicherheitspolitik" title="Sicherheitspolitik">sicherheitskritischen Eingriffen der Politik</a>, beispielsweise beim <a href="Exportkontrolle" title="Exportkontrolle">Export</a> von Hardware.
</p><p>Neben diesen Grafikprozessoren gibt es bereits <a href="Prozessorarchitektur" title="Prozessorarchitektur">Chiparchitekturen</a>, die für das Training und Inferencing von großen neuronalen Netzen optimiert sind.
</p><p>In dem Jahr 2016 wurde beispielsweise von Google die erste Version ihres <a href="Tensor_Processing_Unit" title="Tensor Processing Unit">Tensor Processing Unit</a> (TPU) Systems vorgestellt. Seit den 2020er Jahren gibt es aber eine ganze Reihe von Computerherstellern mit Spezial-Hardware für die Verwendung von LLMs. So haben beispielsweise die Unternehmen Cerebras den CS-1, CS-2 und CS-3, <a href="AMD" title="AMD">AMD</a> die <i>Instinct-Serie</i>, <a href="Intel" title="Intel">Intel</a> die Gaudi-Plattform und <a href="Nvidia" title="Nvidia">Nvidia</a> Hopper bzw. dessen Nachfolger <a href="Blackwell_(Grafikprozessor)" title="Blackwell (Grafikprozessor)">Blackwell</a> eingeführt bzw. angekündigt.
</p>
<div class="mw-heading mw-heading2"><h2 id="Multimodal_Learning">Multimodal Learning</h2></div>
<div class="hauptartikel" role="navigation"><span class="hauptartikel-pfeil" title="siehe" aria-hidden="true" role="presentation">→&nbsp;</span><i><span class="hauptartikel-text">Hauptartikel</span>: <a href="Multimodale_k%C3%BCnstliche_Intelligenz" title="Multimodale künstliche Intelligenz">Multimodale künstliche Intelligenz</a></i></div>
<p>Multimodal Learning verwendet verschieden strukturierte Daten im Bereich der <a href="K%C3%BCnstliche_Intelligenz" title="Künstliche Intelligenz">künstlichen Intelligenz</a>:<sup id="cite_ref-19" class="reference"><a href="#cite_note-19"><span class="cite-bracket">[</span>19<span class="cite-bracket">]</span></a></sup>
</p>
<ul><li>Text ist eine der am häufigsten verwendeten Modalitäten im <a href="Maschinelles_Lernen" title="Maschinelles Lernen">maschinellen Lernen</a>. Textdaten enthalten strukturierte Informationen, und mithilfe der <a href="Computerlinguistik" title="Computerlinguistik">natürlichen Sprachverarbeitung</a> lässt sich leicht Wissen aus ihnen extrahieren. Die Techniken, die zur Verarbeitung dieser Informationen verwendet werden, umfassen <a href="Tokenisierung" title="Tokenisierung">Tokenisierung</a>, <a href="Lemma_(Lexikographie)#Lemmatisierung" title="Lemma (Lexikographie)">Lemmatisierung</a>, <a href="Parser" title="Parser">Syntaxanalyse</a>, Erkennung von benannten Entitäten und Textklassifizierung.</li>
<li>Bilder sind eine wesentliche Quelle visueller Informationen. Mithilfe von <a href="Convolutional_Neural_Network" title="Convolutional Neural Network">Convolutional Neural Networks</a> konnten große Fortschritte beim Verständnis von Bildern erzielt werden. Verwendete Techniken sind z.&nbsp;B. die <a href="Objekterkennung" title="Objekterkennung">Objekterkennung</a>, die <a href="Gesichtserkennung" title="Gesichtserkennung">Gesichtserkennung</a> und die Segmentierung von Bildern.</li>
<li>Die Audiomodalität umfasst Informationen aus Sprachaufnahmen, Tondateien oder Live-Streams.</li>
<li>Videos sind eine leistungsstarke Quelle für multimodale Daten, weil sie visuelle und auditive Informationen kombinieren. <a href="Computer_Vision" title="Computer Vision">Computer Vision</a> und Audioverarbeitungstechniken ermöglichen es, Wissen aus einer Videosequenz zu extrahieren. Dies ermöglicht die Erkennung von sich bewegenden Objekten, die Analyse menschlicher Aktivitäten oder sogar die Erkennung von Gesten.</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Bootstrapping_Language-Image_Pretraining">Bootstrapping Language-Image Pretraining</h2></div>
<p>Die meisten modernen Vision-Language-Modelle benötigen während des Trainings einen hohen Rechenaufwand, weil das Training mit umfangreichen Modellen und Datensätzen erfolgt, vgl. Contrastive Language-Image Pre-training (CLIP). Die Forschung befindet sich an der Schnittstelle zwischen Sehen und Sprache. Daher ist zu erwarten, dass Vision-Language-Modelle von den leicht verfügbaren unimodalen Modellen der <a href="Bilderkennung" title="Bilderkennung">Bilderkennung</a> und natürlichen <a href="Spracherkennung" title="Spracherkennung">Spracherkennung</a> profitieren können.
</p><p>Vortrainierte Vision-Modelle bieten eine qualitativ hochwertige visuelle Darstellung. Vortrainierte <a href="Sprachmodell" title="Sprachmodell">Sprachmodelle</a>, insbesondere große Sprachmodelle, bieten leistungsstarke Fähigkeiten zur Sprachgenerierung und <a href="Zero-Shot_Learning" title="Zero-Shot Learning">Zero-Shot-Übertragung</a>. Um die Kosten zu senken und dem Problem des katastrophalen Vergessens entgegenzuwirken, bleiben die unimodalen vortrainierten Modelle während des Vortrainings eingefroren. Weil große Sprachmodelle jedoch während ihres <a href="Unimodale_Abbildung" title="Unimodale Abbildung">unimodalen</a> Vortrainings keine Bilder gesehen haben, macht das Einfrieren die visuelle Sprachausrichtung besonders schwierig.<sup id="cite_ref-20" class="reference"><a href="#cite_note-20"><span class="cite-bracket">[</span>20<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Skalierungsgesetze">Skalierungsgesetze</h2></div>

<p>Passt man für jede Modalität <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle j}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>j</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle j}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/2f461e54f5c093e92a55547b9764291390f0b5d0.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.671ex; margin-left: -0.027ex; width:0.985ex; height:2.509ex;" alt="{\displaystyle j}" loading="lazy"></span> die sieben Parameter der <a href="Gleichung" title="Gleichung">Gleichung</a>
</p>
<dl><dd><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle {\mathcal {L}}(N,D_{j})=E_{j}+{\frac {A_{j}}{N^{\alpha _{j}}}}+{\frac {B_{j}}{|D_{j}|^{\beta _{j}}}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mrow class="MJX-TeXAtom-ORD">
<mrow class="MJX-TeXAtom-ORD">
<mi class="MJX-tex-caligraphic" mathvariant="script">L</mi>
</mrow>
</mrow>
<mo stretchy="false">(</mo>
<mi>N</mi>
<mo>,</mo>
<msub>
<mi>D</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo stretchy="false">)</mo>
<mo>=</mo>
<msub>
<mi>E</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>+</mo>
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<msub>
<mi>A</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<msup>
<mi>N</mi>
<mrow class="MJX-TeXAtom-ORD">
<msub>
<mi>α<!-- α --></mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
</mrow>
</msup>
</mfrac>
</mrow>
<mo>+</mo>
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<msub>
<mi>B</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mrow>
<mrow class="MJX-TeXAtom-ORD">
<mo stretchy="false">|</mo>
</mrow>
<msub>
<mi>D</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<msup>
<mrow class="MJX-TeXAtom-ORD">
<mo stretchy="false">|</mo>
</mrow>
<mrow class="MJX-TeXAtom-ORD">
<msub>
<mi>β<!-- β --></mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
</mrow>
</msup>
</mrow>
</mfrac>
</mrow>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle {\mathcal {L}}(N,D_{j})=E_{j}+{\frac {A_{j}}{N^{\alpha _{j}}}}+{\frac {B_{j}}{|D_{j}|^{\beta _{j}}}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c47842a9a8d3caf4c73b4bb659027e41d9c1064e.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -3.171ex; width:32.547ex; height:7.009ex;" alt="{\displaystyle {\mathcal {L}}(N,D_{j})=E_{j}+{\frac {A_{j}}{N^{\alpha _{j}}}}+{\frac {B_{j}}{|D_{j}|^{\beta _{j}}}}}" loading="lazy"></span></dd></dl>
<p>an und minimiert
</p>
<dl><dd><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle \sum _{i\mod j}H_{\sigma =0.03}[LSE(a_{j}-\alpha _{j}\cdot \log(N_{i}),b-\beta \cdot \log(D_{i}),e_{j})-L_{i}]}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<munder>
<mo>∑<!-- ∑ --></mo>
<mrow class="MJX-TeXAtom-ORD">
<mi>i</mi>
<mspace width="0.667em"></mspace>
<mi>mod</mi>
<mspace width="thinmathspace"></mspace>
<mspace width="thinmathspace"></mspace>
<mi>j</mi>
</mrow>
</munder>
<msub>
<mi>H</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>σ<!-- σ --></mi>
<mo>=</mo>
<mn>0.03</mn>
</mrow>
</msub>
<mo stretchy="false">[</mo>
<mi>L</mi>
<mi>S</mi>
<mi>E</mi>
<mo stretchy="false">(</mo>
<msub>
<mi>a</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>−<!-- − --></mo>
<msub>
<mi>α<!-- α --></mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>⋅<!-- ⋅ --></mo>
<mi>log</mi>
<mo>⁡<!-- ⁡ --></mo>
<mo stretchy="false">(</mo>
<msub>
<mi>N</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>i</mi>
</mrow>
</msub>
<mo stretchy="false">)</mo>
<mo>,</mo>
<mi>b</mi>
<mo>−<!-- − --></mo>
<mi>β<!-- β --></mi>
<mo>⋅<!-- ⋅ --></mo>
<mi>log</mi>
<mo>⁡<!-- ⁡ --></mo>
<mo stretchy="false">(</mo>
<msub>
<mi>D</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>i</mi>
</mrow>
</msub>
<mo stretchy="false">)</mo>
<mo>,</mo>
<msub>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo stretchy="false">)</mo>
<mo>−<!-- − --></mo>
<msub>
<mi>L</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>i</mi>
</mrow>
</msub>
<mo stretchy="false">]</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle \sum _{i\mod j}H_{\sigma =0.03}[LSE(a_{j}-\alpha _{j}\cdot \log(N_{i}),b-\beta \cdot \log(D_{i}),e_{j})-L_{i}]}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/a24814f6bdbc411eaaf1c7b607e6fbbe699b4003.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -3.338ex; width:62.995ex; height:5.843ex;" alt="{\displaystyle \sum _{i\mod j}H_{\sigma =0.03}[LSE(a_{j}-\alpha _{j}\cdot \log(N_{i}),b-\beta \cdot \log(D_{i}),e_{j})-L_{i}]}" loading="lazy"></span></dd></dl>
<p>für <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle \{a_{j},b_{j},e_{j},\alpha _{j},\beta _{j}\}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mo fence="false" stretchy="false">{</mo>
<msub>
<mi>a</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>,</mo>
<msub>
<mi>b</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>,</mo>
<msub>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>,</mo>
<msub>
<mi>α<!-- α --></mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>,</mo>
<msub>
<mi>β<!-- β --></mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo fence="false" stretchy="false">}</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle \{a_{j},b_{j},e_{j},\alpha _{j},\beta _{j}\}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/725cf98fe956ae6c7531e4720d60720ca8df420d.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.005ex; width:17.123ex; height:3.009ex;" alt="{\displaystyle \{a_{j},b_{j},e_{j},\alpha _{j},\beta _{j}\}}" loading="lazy"></span>, wobei <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle H}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>H</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle H}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/75a9edddcca2f782014371f75dca39d7e13a9c1b.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:2.064ex; height:2.176ex;" alt="{\displaystyle H}" loading="lazy"></span> der Standard-Huberverlust für jeden Durchlauf <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle i}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>i</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle i}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/add78d8608ad86e54951b8c8bd6c8d8416533d20.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:0.802ex; height:2.176ex;" alt="{\displaystyle i}" loading="lazy"></span> und Modalität <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle j}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>j</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle j}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/2f461e54f5c093e92a55547b9764291390f0b5d0.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.671ex; margin-left: -0.027ex; width:0.985ex; height:2.509ex;" alt="{\displaystyle j}" loading="lazy"></span> ist. Man setzt dann <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle A_{j}=e^{a_{j}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<msub>
<mi>A</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>=</mo>
<msup>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<msub>
<mi>a</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
</mrow>
</msup>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle A_{j}=e^{a_{j}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/f1cd34da68c405b492e2b2bcfc1376ddd50f421e.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.005ex; width:8.651ex; height:3.009ex;" alt="{\displaystyle A_{j}=e^{a_{j}}}" loading="lazy"></span>, <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle B_{j}=e^{b_{j}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<msub>
<mi>B</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>=</mo>
<msup>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<msub>
<mi>b</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
</mrow>
</msup>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle B_{j}=e^{b_{j}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/fc8eef1069689e82b9c9242409c4e56a57664e61.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.005ex; width:8.508ex; height:3.343ex;" alt="{\displaystyle B_{j}=e^{b_{j}}}" loading="lazy"></span>, <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle E_{j}=e^{e_{j}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<msub>
<mi>E</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
<mo>=</mo>
<msup>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<msub>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>j</mi>
</mrow>
</msub>
</mrow>
</msup>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle E_{j}=e^{e_{j}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/6b8e959d123b6f16b5acdc947b64c74b6503868f.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.005ex; width:8.52ex; height:3.009ex;" alt="{\displaystyle E_{j}=e^{e_{j}}}" loading="lazy"></span>. Um die optimalen Minima zu identifizieren, verwendet man das <a href="BFGS-Verfahren" title="BFGS-Verfahren">BFGS-Verfahren</a> auf demselben Gitter der Initialisierungswerte. Die erhaltenen optimalen Werte befinden sich nicht an den Grenzen des Initialisierungsgitters. Die Skalierungsgesetze für jede Modalität sind im Einzelnachweis verfügbar. Die Parameter für jede Modalität variieren erheblich.<sup id="cite_ref-21" class="reference"><a href="#cite_note-21"><span class="cite-bracket">[</span>21<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Kollaps">Kollaps</h2></div>
<p>Bei LLM und <a href="Foundation_Models" title="Foundation Models">Foundation Models</a> anderer Art (VAE, GMM) kann es durch das andauernde Training in der laufenden Nutzung zur dauerhaften, bis zur Unbrauchbarkeit reichenden Verschlechterung der Ergebnisqualität kommen. Man spricht auch von einem sogenannten <span style="font-style:normal;font-weight:normal"><a href="Englische_Sprache" title="Englische Sprache">englisch</a></span> <span lang="en-Latn" style="font-style:italic">model collapse</span> <span lang="de" style="font-style:normal;font-weight:normal">‚<a href="Modellkollaps" title="Modellkollaps">Modellkollaps</a>‘</span>.
</p><p>Dies betrifft insbesondere nachfolgende Modellversionen, die mit einem zunehmenden Anteil an künstlich generierten Daten trainiert werden, d.&nbsp;h., dass Teile der Trainingsdaten ebenfalls von einem LLM stammen. Eine Vorsortierung der in der Regel durch <a href="Screen_Scraping" title="Screen Scraping">Webscraping</a> erlangten Daten erscheint bisher als zu aufwändig.<sup id="cite_ref-22" class="reference"><a href="#cite_note-22"><span class="cite-bracket">[</span>22<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Siehe_auch">Siehe auch</h2></div>
<div class="sisterproject" style="margin:0.1em 0 0 0;"><div class="noresize noviewer" style="display:inline-block; line-height:10px; min-width:1.6em; text-align:center;" aria-hidden="true" role="presentation"><span class="mw-default-size" typeof="mw:File"><span title="Commons"></span></span></div><b><span class=""><a class="external text" href="https://commons.wikimedia.org/wiki/Category:Large_language_models?uselang=de"><span lang="en">Commons</span>: Large Language Model</a></span></b>&nbsp;– Sammlung von Bildern, Videos und Audiodateien</div>
<ul><li><a href="Big_Data" title="Big Data">Big Data</a></li>
<li><a href="Data_Science" title="Data Science">Data Science</a></li>
<li><a href="Deep_Learning" title="Deep Learning">Deep Learning</a></li>
<li><a href="Language_Model_for_Dialogue_Applications" title="Language Model for Dialogue Applications">Language Model for Dialogue Applications</a> (LaMDA), ein auf <a href="Dialog" title="Dialog">Dialoge</a> (<a href="Audio" title="Audio">Audio</a>) trainiertes Modell</li>
<li><a href="Sora_(k%C3%BCnstliche_Intelligenz)" title="Sora (künstliche Intelligenz)">Sora</a>, ein Text-zu-Video-Generator</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Literatur">Literatur</h2></div>
<div class="sieheauch" role="navigation" style="font-style:italic;"><span class="sieheauch-text">Siehe auch</span>: <a href="Sprachmodell" title="Sprachmodell">Sprachmodell</a></div>
<ul><li>Endre Pap (Hrsg.): <cite class="lang" lang="en" dir="auto" style="font-style:italic">Artificial Intelligence: Theory and Applications</cite> (=&nbsp;<cite class="lang" lang="en" dir="auto" style="font-style:italic">Studies in Computational Intelligence</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em">&nbsp;</span>973</span>). Springer International Publishing, Cham 2021, ISBN 978-3-03072710-9, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1007/978-3-030-72711-6">10.1007/978-3-030-72711-6</a></span> (englisch).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.btitle=Artificial+Intelligence%3A+Theory+and+Applications&amp;rft.date=2021&amp;rft.doi=10.1007%2F978-3-030-72711-6&amp;rft.genre=book&amp;rft.isbn=9783030727109&amp;rft.place=Cham&amp;rft.pub=Springer+International+Publishing&amp;rft.series=Studies+in+Computational+Intelligence" style="display:none">&nbsp;</span></li>
<li>Sabine Seufert, Siegfried Handschuh (Hrsg.): <cite style="font-style:italic">Generative Künstliche Intelligenz: ChatGPT und Co für Bildung, Wirtschaft und Gesellschaft</cite>. 1. Auflage. Schäffer-Poeschel Verlag, Stuttgart [Freiburg] 2024, ISBN 978-3-7910-6220-4.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.btitle=Generative+K%C3%BCnstliche+Intelligenz%3A+ChatGPT+und+Co+f%C3%BCr+Bildung%2C+Wirtschaft+und+Gesellschaft&amp;rft.date=2024&amp;rft.edition=1.+Auflage&amp;rft.genre=book&amp;rft.isbn=9783791062204&amp;rft.place=Stuttgart+%5BFreiburg%5D&amp;rft.pub=Sch%C3%A4ffer-Poeschel+Verlag" style="display:none">&nbsp;</span></li>
<li>Jürgen Franke, Anita Schöbel (Hrsg.): <cite class="lang" lang="en" dir="auto" style="font-style:italic">Statistical Machine Learning for Engineering with Applications</cite> (=&nbsp;<cite class="lang" lang="en" dir="auto" style="font-style:italic">Lecture Notes in Statistics</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em">&nbsp;</span>227</span>). Springer Nature Switzerland, Cham 2024, ISBN 978-3-03166252-2, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1007/978-3-031-66253-9">10.1007/978-3-031-66253-9</a></span> (englisch).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.btitle=Statistical+Machine+Learning+for+Engineering+with+Applications&amp;rft.date=2024&amp;rft.doi=10.1007%2F978-3-031-66253-9&amp;rft.genre=book&amp;rft.isbn=9783031662522&amp;rft.place=Cham&amp;rft.pub=Springer+Nature+Switzerland&amp;rft.series=Lecture+Notes+in+Statistics" style="display:none">&nbsp;</span></li>
<li>Wolfgang Ertel: <cite style="font-style:italic">Grundkurs Künstliche Intelligenz: Eine praxisorientierte Einführung</cite> (=&nbsp;<cite style="font-style:italic">Computational Intelligence</cite>). Springer Fachmedien Wiesbaden, Wiesbaden 2025, ISBN 978-3-658-44954-4, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1007/978-3-658-44955-1">10.1007/978-3-658-44955-1</a></span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.au=Wolfgang+Ertel&amp;rft.btitle=Grundkurs+K%C3%BCnstliche+Intelligenz%3A+Eine+praxisorientierte+Einf%C3%BChrung&amp;rft.date=2025&amp;rft.doi=10.1007%2F978-3-658-44955-1&amp;rft.genre=book&amp;rft.isbn=9783658449544&amp;rft.place=Wiesbaden&amp;rft.pub=Springer+Fachmedien+Wiesbaden&amp;rft.series=Computational+Intelligence" style="display:none">&nbsp;</span></li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-1"><span class="mw-cite-backlink"><a href="#cite_ref-1">↑</a></span> <span class="reference-text"><span class="cite">Patricia Kelbert, Dr Julien Siebert, Lisa Jöckel: <a rel="nofollow" class="external text" href="https://www.iese.fraunhofer.de/blog/large-language-models-ki-sprachmodelle/"><i>Was sind Large Language Models? Und was ist bei der Nutzung von KI-Sprachmodellen zu beachten? - Blog des Fraunhofer IESE.</i></a> In: <i>Fraunhofer IESE.</i> 12.&nbsp;Dezember 2023,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Was+sind+Large+Language+Models%3F+Und+was+ist+bei+der+Nutzung+von+KI-Sprachmodellen+zu+beachten%3F+-+Blog+des+Fraunhofer+IESE&amp;rft.description=Was+sind+Large+Language+Models%3F+Und+was+ist+bei+der+Nutzung+von+KI-Sprachmodellen+zu+beachten%3F+-+Blog+des+Fraunhofer+IESE&amp;rft.identifier=https%3A%2F%2Fwww.iese.fraunhofer.de%2Fblog%2Flarge-language-models-ki-sprachmodelle%2F&amp;rft.creator=Patricia+Kelbert%2C+Dr+Julien+Siebert%2C+Lisa+J%C3%B6ckel&amp;rft.date=2023-12-12&amp;rft.language=de">&nbsp;</span></span>
</li>
<li id="cite_note-2"><span class="mw-cite-backlink"><a href="#cite_ref-2">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://openai.com/research/better-language-models"><i>Better language models and their implications.</i></a><span class="Abrufdatum"> Abgerufen am 15.&nbsp;Januar 2024</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Better+language+models+and+their+implications&amp;rft.description=Better+language+models+and+their+implications&amp;rft.identifier=https%3A%2F%2Fopenai.com%2Fresearch%2Fbetter-language-models&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-3"><span class="mw-cite-backlink"><a href="#cite_ref-3">↑</a></span> <span class="reference-text"><span class="cite">Rick Merritt: <a rel="nofollow" class="external text" href="https://blogs.nvidia.com/blog/what-is-a-transformer-model/"><i>What Is a Transformer Model?</i></a> 25.&nbsp;März 2022,<span class="Abrufdatum"> abgerufen am 15.&nbsp;Januar 2024</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=What+Is+a+Transformer+Model%3F&amp;rft.description=What+Is+a+Transformer+Model%3F&amp;rft.identifier=https%3A%2F%2Fblogs.nvidia.com%2Fblog%2Fwhat-is-a-transformer-model%2F&amp;rft.creator=Rick+Merritt&amp;rft.date=2022-03-25&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-4"><span class="mw-cite-backlink"><a href="#cite_ref-4">↑</a></span> <span class="reference-text">Guandong Feng et al.: <cite class="lang" lang="en" dir="auto" style="font-style:italic">Robust NL-to-Cypher Translation for KBQA: Harnessing Large Language Model with Chain of Prompts</cite>. In: <cite class="lang" lang="en" dir="auto" style="font-style:italic">Knowledge Graph and Semantic Computing: Knowledge Graph Empowers Artificial General Intelligence</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em">&nbsp;</span>1923</span>. Springer Nature Singapore, Singapore 2023, ISBN 978-981-9972-23-4, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em">&nbsp;</span>317–326</span>, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1007/978-981-99-7224-1_25">10.1007/978-981-99-7224-1_25</a></span> (englisch, <a rel="nofollow" class="external text" href="https://link.springer.com/10.1007/978-981-99-7224-1_25">springer.com</a> [abgerufen am 8.&nbsp;November 2025]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.atitle=Robust+NL-to-Cypher+Translation+for+KBQA%3A+Harnessing+Large+Language+Model+with+Chain+of+Prompts&amp;rft.au=Guandong+Feng+et+al.&amp;rft.btitle=Knowledge+Graph+and+Semantic+Computing%3A+Knowledge+Graph+Empowers+Artificial+General+Intelligence&amp;rft.date=2023&amp;rft.doi=10.1007%2F978-981-99-7224-1_25&amp;rft.genre=book&amp;rft.isbn=9789819972234&amp;rft.pages=317-326&amp;rft.place=Singapore&amp;rft.pub=Springer+Nature+Singapore&amp;rft.volume=1923" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-5"><span class="mw-cite-backlink"><a href="#cite_ref-5">↑</a></span> <span class="reference-text"><span class="cite">Samuel R. Bowman: <a rel="nofollow" class="external text" href="http://arxiv.org/abs/2304.00612"><i>Eight Things to Know about Large Language Models.</i></a> In: <i><a href="ArXiv" title="ArXiv">ArXiv</a>.</i> 2.&nbsp;April 2023,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Eight+Things+to+Know+about+Large+Language+Models&amp;rft.description=Eight+Things+to+Know+about+Large+Language+Models&amp;rft.identifier=http%3A%2F%2Farxiv.org%2Fabs%2F2304.00612&amp;rft.creator=Samuel+R.+Bowman&amp;rft.date=2023-04-02&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-6"><span class="mw-cite-backlink"><a href="#cite_ref-6">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://www.ibm.com/de-de/topics/fine-tuning"><i>Was ist Feinabstimmung? | IBM.</i></a> 15.&nbsp;März 2024,<span class="Abrufdatum"> abgerufen am 10.&nbsp;Dezember 2024</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Was+ist+Feinabstimmung%3F+%7C+IBM&amp;rft.description=Was+ist+Feinabstimmung%3F+%7C+IBM&amp;rft.identifier=https%3A%2F%2Fwww.ibm.com%2Fde-de%2Ftopics%2Ffine-tuning&amp;rft.date=2024-03-15&amp;rft.language=de">&nbsp;</span></span>
</li>
<li id="cite_note-7"><span class="mw-cite-backlink"><a href="#cite_ref-7">↑</a></span> <span class="reference-text"><span class="cite">Tom B. Brown et al.: <a rel="nofollow" class="external text" href="http://arxiv.org/abs/2005.14165"><i>Language Models are Few-Shot Learners.</i></a> 22.&nbsp;Juli 2020,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Language+Models+are+Few-Shot+Learners&amp;rft.description=Language+Models+are+Few-Shot+Learners&amp;rft.identifier=http%3A%2F%2Farxiv.org%2Fabs%2F2005.14165&amp;rft.creator=Tom+B.+Brown+et+al.&amp;rft.date=2020-07-22&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-8"><span class="mw-cite-backlink"><a href="#cite_ref-8">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://www.amacad.org/publication/human-language-understanding-reasoning"><i>Human Language Understanding &amp; Reasoning.</i></a> 13.&nbsp;April 2022,<span class="Abrufdatum"> abgerufen am 15.&nbsp;Januar 2024</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Human+Language+Understanding+%26+Reasoning&amp;rft.description=Human+Language+Understanding+%26+Reasoning&amp;rft.identifier=https%3A%2F%2Fwww.amacad.org%2Fpublication%2Fhuman-language-understanding-reasoning&amp;rft.date=2022-04-13&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-9"><span class="mw-cite-backlink"><a href="#cite_ref-9">↑</a></span> <span class="reference-text"><span class="cite">Markus Städeli: <a rel="nofollow" class="external text" href="https://www.nzz.ch/wirtschaft/die-rangliste-der-weltbesten-ki-chatbots-zeigt-bei-der-kuenstlichen-intelligenz-ist-china-den-amerikanischen-anbietern-dicht-auf-den-fersen-ld.1861889"><i>Das sind die besten KI-Sprachmodelle und viele stammen auch China.</i></a> 14.&nbsp;Dezember 2024,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Das+sind+die+besten+KI-Sprachmodelle+und+viele+stammen+auch+China&amp;rft.description=Das+sind+die+besten+KI-Sprachmodelle+und+viele+stammen+auch+China&amp;rft.identifier=https%3A%2F%2Fwww.nzz.ch%2Fwirtschaft%2Fdie-rangliste-der-weltbesten-ki-chatbots-zeigt-bei-der-kuenstlichen-intelligenz-ist-china-den-amerikanischen-anbietern-dicht-auf-den-fersen-ld.1861889&amp;rft.creator=Markus+St%C3%A4deli&amp;rft.date=2024-12-14&amp;rft.language=de">&nbsp;</span></span>
</li>
<li id="cite_note-10"><span class="mw-cite-backlink"><a href="#cite_ref-10">↑</a></span> <span class="reference-text"><span class="cite">Ashish Vaswani et al.: <a rel="nofollow" class="external text" href="http://arxiv.org/abs/1706.03762"><i>Attention Is All You Need.</i></a> 2.&nbsp;August 2023,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Attention+Is+All+You+Need&amp;rft.description=Attention+Is+All+You+Need&amp;rft.identifier=http%3A%2F%2Farxiv.org%2Fabs%2F1706.03762&amp;rft.creator=Ashish+Vaswani+et+al.&amp;rft.date=2023-08-02">&nbsp;</span></span>
</li>
<li id="cite_note-11"><span class="mw-cite-backlink"><a href="#cite_ref-11">↑</a></span> <span class="reference-text"><span class="cite">Rob Toews: <a rel="nofollow" class="external text" href="https://www.forbes.com/sites/robtoews/2023/09/03/transformers-revolutionized-ai-what-will-replace-them/"><i>Transformers Revolutionized AI. What Will Replace Them?</i></a> In: <i>Forbes.</i> 3.&nbsp;September 2023,<span class="Abrufdatum"> abgerufen am 5.&nbsp;Februar 2024</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Transformers+Revolutionized+AI.+What+Will+Replace+Them%3F&amp;rft.description=Transformers+Revolutionized+AI.+What+Will+Replace+Them%3F&amp;rft.identifier=https%3A%2F%2Fwww.forbes.com%2Fsites%2Frobtoews%2F2023%2F09%2F03%2Ftransformers-revolutionized-ai-what-will-replace-them%2F&amp;rft.creator=Rob+Toews&amp;rft.date=2023-09-03&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-12"><span class="mw-cite-backlink"><a href="#cite_ref-12">↑</a></span> <span class="reference-text"><span class="cite">Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio: <a rel="nofollow" class="external text" href="http://arxiv.org/abs/1409.0473"><i>Neural Machine Translation by Jointly Learning to Align and Translate.</i></a> 19.&nbsp;Mai 2016,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Neural+Machine+Translation+by+Jointly+Learning+to+Align+and+Translate&amp;rft.description=Neural+Machine+Translation+by+Jointly+Learning+to+Align+and+Translate&amp;rft.identifier=http%3A%2F%2Farxiv.org%2Fabs%2F1409.0473&amp;rft.creator=Dzmitry+Bahdanau%2C+Kyunghyun+Cho%2C+Yoshua+Bengio&amp;rft.date=2016-05-19">&nbsp;</span></span>
</li>
<li id="cite_note-13"><span class="mw-cite-backlink"><a href="#cite_ref-13">↑</a></span> <span class="reference-text"><span class="cite">Nico Litzel, Stefan Luber: <a rel="nofollow" class="external text" href="https://www.bigdata-insider.de/was-ist-bert-a-1116088/"><i>Was ist BERT?</i></a> In: <i>Bigdata Insider.</i> Vogel Communications Group, 10.&nbsp;Mai 2022,<span class="Abrufdatum"> abgerufen am 8.&nbsp;November 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Was+ist+BERT%3F&amp;rft.description=Was+ist+BERT%3F&amp;rft.identifier=https%3A%2F%2Fwww.bigdata-insider.de%2Fwas-ist-bert-a-1116088%2F&amp;rft.creator=Nico+Litzel%2C+Stefan+Luber&amp;rft.publisher=Vogel+Communications+Group&amp;rft.date=2022-05-10&amp;rft.language=de">&nbsp;</span></span>
</li>
<li id="cite_note-14"><span class="mw-cite-backlink"><a href="#cite_ref-14">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://www.euronews.com/next/2023/11/30/chatgpt-a-year-on-3-ways-the-ai-chatbot-has-completely-changed-the-world-in-12-months"><i>ChatGPT turns 1: How the AI chatbot has completely changed the world.</i></a> 30.&nbsp;November 2023,<span class="Abrufdatum"> abgerufen am 5.&nbsp;Februar 2024</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=ChatGPT+turns+1%3A+How+the+AI+chatbot+has+completely+changed+the+world&amp;rft.description=ChatGPT+turns+1%3A+How+the+AI+chatbot+has+completely+changed+the+world&amp;rft.identifier=https%3A%2F%2Fwww.euronews.com%2Fnext%2F2023%2F11%2F30%2Fchatgpt-a-year-on-3-ways-the-ai-chatbot-has-completely-changed-the-world-in-12-months&amp;rft.date=2023-11-30&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-15"><span class="mw-cite-backlink"><a href="#cite_ref-15">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://www.technologyreview.com/2023/03/14/1069823/gpt-4-is-bigger-and-better-chatgpt-openai/"><i>GPT-4 is bigger and better than ChatGPT—but OpenAI won’t say why.</i></a><span class="Abrufdatum"> Abgerufen am 5.&nbsp;Februar 2024</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=GPT-4+is+bigger+and+better+than+ChatGPT%E2%80%94but+OpenAI+won%E2%80%99t+say+why&amp;rft.description=GPT-4+is+bigger+and+better+than+ChatGPT%E2%80%94but+OpenAI+won%E2%80%99t+say+why&amp;rft.identifier=https%3A%2F%2Fwww.technologyreview.com%2F2023%2F03%2F14%2F1069823%2Fgpt-4-is-bigger-and-better-chatgpt-openai%2F&amp;rft.language=en">&nbsp;</span></span>
</li>
<li id="cite_note-16"><span class="mw-cite-backlink"><a href="#cite_ref-16">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://ourworldindata.org/grapher/artificial-intelligence-parameter-count?time=2017-09-05..latest"><i>Parameters in notable artificial intelligence systems.</i></a> <i><a href="Our_World_in_Data" title="Our World in Data">Our World in Data</a></i>, 3.&nbsp;April 2024,<span class="Abrufdatum"> abgerufen am 16.&nbsp;Mai 2024</span> (britisches Englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Parameters+in+notable+artificial+intelligence+systems&amp;rft.description=Parameters+in+notable+artificial+intelligence+systems&amp;rft.identifier=https%3A%2F%2Fourworldindata.org%2Fgrapher%2Fartificial-intelligence-parameter-count%3Ftime%3D2017-09-05..latest&amp;rft.publisher=%27%27%5B%5BOur+World+in+Data%5D%5D%27%27&amp;rft.date=2024-04-03&amp;rft.language=en-GB">&nbsp;</span></span>
</li>
<li id="cite_note-17"><span class="mw-cite-backlink"><a href="#cite_ref-17">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard"><i>LMSys Chatbot Arena Leaderboard - a Hugging Face Space by lmsys.</i></a><span class="Abrufdatum"> Abgerufen am 5.&nbsp;Februar 2024</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=LMSys+Chatbot+Arena+Leaderboard+-+a+Hugging+Face+Space+by+lmsys&amp;rft.description=LMSys+Chatbot+Arena+Leaderboard+-+a+Hugging+Face+Space+by+lmsys&amp;rft.identifier=https%3A%2F%2Fhuggingface.co%2Fspaces%2Flmsys%2Fchatbot-arena-leaderboard">&nbsp;</span></span>
</li>
<li id="cite_note-18"><span class="mw-cite-backlink"><a href="#cite_ref-18">↑</a></span> <span class="reference-text"><span class="cite">Siddharth Jindal: <a rel="nofollow" class="external text" href="https://analyticsindiamag.com/googles-gemini-pro-beats-gpt-4/"><i>Google's Gemini Pro Beats GPT-4.</i></a> 27.&nbsp;Januar 2024,<span class="Abrufdatum"> abgerufen am 5.&nbsp;Februar 2024</span> (amerikanisches Englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Google%27s+Gemini+Pro+Beats+GPT-4&amp;rft.description=Google%27s+Gemini+Pro+Beats+GPT-4&amp;rft.identifier=https%3A%2F%2Fanalyticsindiamag.com%2Fgoogles-gemini-pro-beats-gpt-4%2F&amp;rft.creator=Siddharth+Jindal&amp;rft.date=2024-01-27&amp;rft.language=en-US">&nbsp;</span></span>
</li>
<li id="cite_note-19"><span class="mw-cite-backlink"><a href="#cite_ref-19">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://datascientest.com/de/multimodal-learning-die-technik-die-die-kuenstliche-intelligenz-revolutioniert"><i>Multimodal Learning: Die Technik, die die künstliche Intelligenz revolutioniert.</i></a> In: <i>Weiterbildung Data Science | DataScientest.com.</i> 17.&nbsp;August 2023,<span class="Abrufdatum"> abgerufen am 24.&nbsp;Juni 2024</span> (deutsch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&amp;rfr_id=info%3Asid%2Fde.wikipedia.org%3ALarge+Language+Model&amp;rft.title=Multimodal+Learning%3A+Die+Technik%2C+die+die+k%C3%BCnstliche+Intelligenz+revolutioniert&amp;rft.description=Multimodal+Learning%3A+Die+Technik%2C+die+die+k%C3%BCnstliche+Intelligenz+revolutioniert&amp;rft.identifier=https%3A%2F%2Fdatascientest.com%2Fde%2Fmultimodal-learning-die-technik-die-die-kuenstliche-intelligenz-revolutioniert&amp;rft.date=2023-08-17&amp;rft.language=de-DE">&nbsp;</span></span>
</li>
<li id="cite_note-20"><span class="mw-cite-backlink"><a href="#cite_ref-20">↑</a></span> <span class="reference-text">Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi: <cite style="font-style:italic">BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models</cite>. 2023, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.48550/ARXIV.2301.12597">10.48550/ARXIV.2301.12597</a></span>, <a href="ArXiv" title="ArXiv">arxiv</a>:<a rel="nofollow" class="external text" href="https://arxiv.org/abs/2301.12597">2301.12597</a>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.au=Junnan+Li%2C+Dongxu+Li%2C+Silvio+Savarese%2C+...&amp;rft.btitle=BLIP-2%3A+Bootstrapping+Language-Image+Pre-training+with+Frozen+Image+Encoders+and+Large+Language+Models&amp;rft.date=2023&amp;rft.doi=10.48550%2FARXIV.2301.12597&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-21"><span class="mw-cite-backlink"><a href="#cite_ref-21">↑</a></span> <span class="reference-text">Armen Aghajanyan, Lili Yu, Alexis Conneau, Wei-Ning Hsu, Karen Hambardzumyan, Susan Zhang, Stephen Roller, Naman Goyal, Omer Levy, Luke Zettlemoyer: <cite style="font-style:italic">Scaling Laws for Generative Mixed-Modal Language Models</cite>. 10.&nbsp;Januar 2023, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.48550/ARXIV.2301.03728">10.48550/ARXIV.2301.03728</a></span>.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.au=Armen+Aghajanyan%2C+Lili+Yu%2C+Alexis+Conneau%2C+...&amp;rft.btitle=Scaling+Laws+for+Generative+Mixed-Modal+Language+Models&amp;rft.date=2023-01-10&amp;rft.doi=10.48550%2FARXIV.2301.03728&amp;rft.genre=book" style="display:none">&nbsp;</span></span>
</li>
<li id="cite_note-22"><span class="mw-cite-backlink"><a href="#cite_ref-22">↑</a></span> <span class="reference-text">Ilia Shumailov et al.: <cite class="lang" lang="en" dir="auto" style="font-style:italic">AI models collapse when trained on recursively generated data</cite>. In: <cite class="lang" lang="en" dir="auto" style="font-style:italic">Nature</cite>. <span style="white-space:nowrap">Band<span style="display:inline-block;width:.2em">&nbsp;</span>631</span>, <span style="white-space:nowrap">Nr.<span style="display:inline-block;width:.2em">&nbsp;</span>8022</span>, 25.&nbsp;Juli 2024, <a href="Internationale_Standardnummer_f%C3%BCr_fortlaufende_Sammelwerke" title="Internationale Standardnummer für fortlaufende Sammelwerke">ISSN</a>&nbsp;<span style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://zdb-katalog.de/list.xhtml?t=iss%3D%220028-0836%22&amp;key=cql">0028-0836</a></span>, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em">&nbsp;</span>755–759</span>, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1038/s41586-024-07566-y">10.1038/s41586-024-07566-y</a></span>, <a class="external mw-magiclink-pmid" rel="nofollow" href="https://www.ncbi.nlm.nih.gov/pubmed/39048682?dopt=Abstract">PMID 39048682</a>, <a rel="nofollow" class="external text" href="https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11269175/">PMC&nbsp;11269175</a> (freier Volltext) – (englisch, <a rel="nofollow" class="external text" href="https://www.nature.com/articles/s41586-024-07566-y">nature.com</a> [abgerufen am 27.&nbsp;Juli 2024]).<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rfr_id=info:sid/de.wikipedia.org:Large+Language+Model&amp;rft.atitle=AI+models+collapse+when+trained+on+recursively+generated+data&amp;rft.au=Ilia+Shumailov+et+al.&amp;rft.date=2024-07-25&amp;rft.doi=10.1038%2Fs41586-024-07566-y&amp;rft.genre=journal&amp;rft.issn=0028-0836&amp;rft.issue=8022&amp;rft.jtitle=Nature&amp;rft.pages=755-759&amp;rft.pmc=11269175&amp;rft.pmid=39048682&amp;rft.volume=631" style="display:none">&nbsp;</span></span>
</li>
</ol>
<div class="hintergrundfarbe1 rahmenfarbe1 navigation-not-searchable normdaten-typ-s" style="border-style: solid; border-width: 1px; clear: left; margin-bottom:1em; margin-top:1em; padding: 0.25em; overflow: hidden; word-break: break-word; word-wrap: break-word;" id="normdaten">
<div style="display: table-cell; vertical-align: middle; width: 100%;">
<div>
Normdaten&nbsp;(Sachbegriff): <a href="Gemeinsame_Normdatei" title="Gemeinsame Normdatei">GND</a>: <span class="-print"><a rel="nofollow" class="external text" href="https://d-nb.info/gnd/1322631905">1322631905</a></span> </div>
</div></div></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2026-01-04" href="https://de.wikipedia.org/wiki/?title=Large_Language_Model&amp;oldid=263017567">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>

</body></html>